同一把API密鑰、同一組提示詞,mimo-v2.6-pro、claude-sonnet-5、claude-fable-5-1和gpt-6-astra誰更穩?本次透過Crazyrouter執行24次真實請求,比較正確性、嚴格格式遵循和整次請求耗時,也保留Claude端點返回400的失敗記錄。

| 模型ID | 正確 | 嚴格格式 | 平均耗時 | 本輪特點 |
|---|---|---|---|---|
mimo-v2.6-pro |
6/6 | 6/6 | 6.36秒 | 正確且格式穩定 |
claude-sonnet-5 |
6/6 | 4/6 | 3.82秒 | 最快,兩次增加圍欄或示例 |
claude-fable-5-1 |
6/6 | 5/6 | 4.87秒 | 速度與格式較均衡 |
gpt-6-astra |
6/6 | 6/6 | 7.59秒 | 格式穩定,本輪最慢 |
耗時是非串流完整回應時間,不是首字延遲。每題只執行一次,不能代表長期SLA。

GET https://api.crazyrouter.com/v1/models
POST https://api.crazyrouter.com/v1/chat/completions
POST https://api.crazyrouter.com/v1/messages
當前密鑰實際返回156個模型,上述ID均由目錄確認。
第一次把兩個Claude模型發到/v1/chat/completions,12次全部返回HTTP 400。改用/v1/messages後最小請求返回200;隨後發現該路由不接受本輪傳入的temperature參數,刪除該參數後12項Claude正式測試全部成功。
因此不能把第一次400寫成「Claude不可用」。準確結論是端點或參數不匹配。
週期推理中,四款都算出最小公倍數36分鐘,答案為09:00、09:36、10:12共3次;Fable在JSON前增加解釋,內容正確但格式失敗。程式碼題均把預設字串排序修成數值比較。金額題均得到A17為39、B02為14.5、合計53.5。資訊提取均找到cn-east-2、94827-r3和CR-5821,但Sonnet添加Markdown圍欄。嚴格指令題四款均通過。故障分析均定位上游首字延遲為主因、客戶端重試翻倍為放大因素。

Sonnet本輪平均3.82秒最快,GPT-6為7.59秒最慢。但輸出長度不同,非串流耗時包含生成時間,不能直接等同於基礎速度。
Crazyrouter適合用一套餘額和密鑰測試多個模型,按量使用且無需訂閱。部分模型有動態優惠,但不要假設永久打折;以模型與優惠頁和LLM指南為準。
本輪目錄返回gpt-6-astra,6項正式請求均為HTTP 200。
端點和參數不匹配;改用Anthropic Messages並刪除不兼容參數後成功。
本文按Xiaomi/MiMo口徑選擇質量向mimo-v2.6-pro,未使用ultraspeed變體。
不能,只能說明這6道確定性任務的一次運行通過。
價格與優惠動態變化,本文強調統一接入和優惠機會。
三圖已驗證HTTP 200、image/png和遠端/本地SHA-256一致;發布時仍應轉存並預覽。
這輪沒有全方位碾壓者:MiMo與GPT-6格式最穩,Sonnet最快,Fable居中。先查模型目錄、選對端點,再用真實業務提示詞復測,比只看榜單更可靠。